루프 구조
검색·답변 품질을 지속 측정하고, 실패를 자동 수집·분류해 사람이 개선하는 PDCA 순환.
1 측정
품질 게이트
golden·judge·RAGAS로 검색·답변 채점
→
2 수집
실패 로깅
운영·eval 실패를 PII-free 슬롯으로 기록
→
3 분류
taxonomy
6종 실패 유형 + 조치·금지 힌트
→
4 개선
사람 판단
후보·근거 자동 수집 → 사람이 조치·승격
↑ 5 재측정으로 순환 (개선 후 회귀 확인) ↑
serving 스냅샷 확인 중…
지금 이 순간 운영 서버 상태 (GET /health 실시간).
이 카드만 실시간입니다. 아래 품질 지표는 기준일(2026-07-14) 스냅샷입니다.
품질 게이트 지표 2026-07-14 기준
golden 회귀셋과 근거성 지표로 검색·답변 품질을 게이트. 값은 이 페이지에서만 관리(기준일 스냅샷).
golden 검색 회귀
158 / 158
전 케이스 통과
RAGAS 근거성 게이트
123 / 123
faithfulness·answer relevancy (v2.7.17)
Judge (인용 검증)
통과
인용 존재·유효·검색 내 포함·시행일
단위 테스트
312
결정적 로직(채번·규칙·청킹)
무인 평가 레이어
사람 개입 없이 정기 실행되는 평가 계층 (러너 상주 없이 GitHub 클라우드).
매일 · 운영 shadow정기
운영 API에 대표 질문을 매일 던져 답변·근거성을 감시(생존 확인). 일시 장애는 알림 노이즈로 만들지 않음.
매주 · 심층 품질 게이트정기
일회용 벡터 DB에 운영 데이터 사본을 복원하고 golden 158건을 judge·RAGAS로 정밀 채점(주간 회귀 측정). 미검증이면 통과가 아니라 실패로 처리.
상시 · 런타임 실패 수집 (유입갭 루프)
운영이 답을 못 하면(범위 밖·약검색·인용 부실) 주소·식별자 없이 슬롯만(용도지역·행위·관할) 기록 → 실패 지문으로 클러스터 → 개선 후보 큐(사람 작성). 원문·개인정보는 로깅하지 않음.
설계 원칙
자동은 수집·분류·제안까지, 판단·조치·반영은 사람이 한다.
- PDCA — 계획(플랜 승인) → 구현 → 검증 → 개선. 승인 전 구현 착수 없음.
- no-case-by-case — 실패 1건을 맞추려는 케이스별 하드코딩·boost·pin 금지. 개선 순서는 데이터/코퍼스 → 구조적 로직 → (마지막) 기대값.
- human-in-the-loop — golden 승격·개선 반영은 항상 사람 확인(HUMAN_CONFIRM). 코드·정답셋 자동 수정·머지 없음.
- PII 최소화 — 실패 로그는 화이트리스트 슬롯만. 질문 원문·주소·필지·건축물대장 식별자는 저장하지 않음.
- fail-safe 게이트 — 데이터 신선도·무결성이 검증 안 되면 통과가 아니라 실패(green이 아니라 red)로 표시.